Inco 开源 Splash,本地 Mac 推理最高达 144 Token/s
Inco AI 开源本地推理引擎 Splash,并展示 Qwen3.8-27B 在 M5 Max MacBook Pro 上最高 144 Token/s。LM Studio 已在 0.4.25 版本接入该引擎。Splash 基于 DFlash 思路,将小模型并行猜测与大模型批量验证扩展到整个本地推理流程,目前支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B。

Inco AI 开源本地推理引擎 Splash,并展示 Qwen3.8-27B 在 M5 Max MacBook Pro 上最高 144 Token/s。LM Studio 已在 0.4.25 版本接入该引擎。Splash 基于 DFlash 思路,将小模型并行猜测与大模型批量验证扩展到整个本地推理流程,目前支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B。

英伟达推出免费开源软件PAIR(个人AI路由器),可将家庭或办公网络中闲置的电脑(如RTX 20系列以上显卡、苹果M4芯片设备)连接起来,协同处理本地AI推理任务,支持Ollama、LM Studio等工具,旨在提升本地AI算力效率。该工具非硬件路由器,通过软件发现并组网兼容设备。

苹果发布新款 Mac mini 和 Mac Studio,继续强化 AI 计算能力。公司称,其芯片配备神经网络引擎,并通过 RAM 架构缓解部分内存瓶颈。新一代 Mac mini 提供 M6 和 M5 Pro 两个版本,起售价分别为 6999 元和 12999 元,支持更高内存带宽、Wi‑Fi 7、蓝牙 6 和 2.5Gb 网口,9 月 22 日开卖。

CanIRun.ai可通过浏览器识别GPU与内存规格,估算本地运行LLM的可行性和速度,但硬件覆盖、结果误差与隐私问题也引发社区讨论。

OpenAI发布gpt-oss-120b与gpt-oss-20b两款开放权重模型,采用Apache 2.0许可,可本地或云端运行。此举被视为其重返开放模型竞争的重要一步,也将进一步影响AI基础设施与开发生态。

Tether基于阿西莫夫《基地》系列中的心理史学概念,推出QVAC项目,旨在构建去中心化的本地AI基础设施。文章详细阐述了Tether如何利用稳定币储备(Q1 2026净利润10.4亿美元、储备缓冲82.3亿美元)支持AI发展,QVAC的架构特点:边缘优先、P2P推理、跨平台SDK。首个模型MedPsy在医疗基准测试中以小参数(1.7B/4B)超越Google的MedGemma-27B,展示了领域专用边缘模型的潜力。同时探讨了本地AI与云端AI在便利与控制之间的权衡,以及独立复制验证的重要性。
